Agent(智慧代理),就是一個自主執行的系統。以LLM(大語言模型)為核心推理引擎,因為有LLM才能讓Agent持續運作。以LLM的核心架構中,Agent就能主動呼叫外部工具,搜尋網頁、存取資料庫、發送電子郵件或執行系統API。Agent有LLM,但不像我們平時用的AI,單純回覆一段文字,Agent在背景會自我修正,如果搜尋結果出錯或API回傳失敗,Agent會根據錯誤訊息自己試別的方法,不需要用戶一直傳Prompt(指令)引導。簡單來講,Agent比較聰明,能夠自問自答且修正,平時用的AI需要Prompt才會運作,只是一種LLM。
Agent的防禦策略:簡單來講就像是輸送帶,看到壞掉的東西就丟,在Agent前端放文字識別模型,即時掃描使用者輸入與外部工具回傳的資料內容,第一時間攔截帶有攻擊意圖的文字指令,結構化的Prompt模板設計,強制將使用者原始指令,與外部檢索到的資料進行語意層面隔離,確保Agent讀取外部網頁或郵件時,僅將其視為資料,而非可執行的命令。
儘有第一層的過濾,LLM能否完全抵禦複雜的提示注入,仍存在不確定性。第二層防禦遵循資安領域的最小權限原則,即使 LLM 的思維被惡意指令影響,系統會在最後執行端強制攔截危險動作。Agent呼叫外部API之前,設置決定性的安全檢查層。系統會依據預設細粒度策略(Fine-grained Policies),嚴格限制Agent可呼叫的工具類別與參數範圍。 Agent 在每個任務階段僅能拿到執行當前動作所需的最低權限。一旦Agent被誘導試圖調用未授權的 API(越權),能力強制制層會直接拒絕該請求。
守門員機制能有效攔截明顯越權的動作,但面對更為隱蔽的,授權內動作串接攻擊(Authorized-action chaining)卻容易失效,問題就是攻擊全程不越權,多個合規的合法動作按特定順序組合,從而達成惡意結果。以 Agent呼叫工具的歷史動作序列為輸入特徵,動態計算當前行為模式的異常機率。追蹤Agent當前的上下文狀態與權限邊界。一旦感測器發現連鎖動作存在異常邏輯或高風險傾向,系統會即時介入,動態降低Agent的權限或中斷後續執行。
除了即時的阻斷機制外,Agent防禦體系還需要具備安全運作的底層環境與自我優化評估機制。所有由Agent產生的程式碼執行,網頁瀏覽或系統指令,皆嚴格限制於獨立的容器或沙盒環境中運行,確保發生的任何異常不會對實體主機或資料庫造成實質破壞。對抗式評估框架:透過標準化的基準測試環境,模擬各類複雜的攻擊情境,並以攻擊成功率(ASR)、正常任務完成率(ACC)與運算成本,三項關鍵指標量化評估防禦表現,促進防禦策略的持續迭代。之後就是會在AgentDojo測試安全防禦力與任務完成度。